1
Il Cambiamento di Paradigma: Dai Modelli Specifici per Compito agli LLM
PolyU COMP5511Lecture 10
00:00

Evoluzione della PNL: dall'IA Frammentata ai Modelli Fondamentali

Definizioni

  • IA Frammentata: un'epoca definita da architetture neurali discrete e specializzate progettate per singoli compiti come l'etichettatura di sequenze o la classificazione.
  • Modello Fondamentale: un'architettura transformer unificata e monolitica che tratta tutti i problemi linguistici come una sequenza generativa testo-a-testo $x \rightarrow y$.

Concetti Fondamentali

  • Consolidamento Architetturale: Storicamente, la PNL richiedeva pipeline personalizzate (Bi-LSTM per la NER, CNN per il sentiment). Gli LLM fondono questi silos in un'unica architettura di base in cui gli stessi pesi vengono utilizzati per ogni compito.
  • L'Interfaccia Unificata: Gli LLM sostituiscono i "head di output" specializzati (ad es., Softmax a 3 classi) con un'interfaccia in linguaggio naturale. Input e output sono sempre stringhe, permettendo al modello di interpretare l'intento piuttosto che il formato.
  • Trasferimento di Conoscenza: I modelli tradizionali erano "tabula rasa" per ogni compito. Gli LLM danno priorità alla Generalizzazione Prima, dove i compiti specifici sono semplici applicazioni di una rappresentazione interna del linguaggio preesistente e robusta.

Contesto Storico

  • Prima del 2018: L'isolamento dei compiti richiedeva l'addestramento di modelli distinti con diverse funzioni di perdita $\mathcal{L}_{task}$.
  • Era Moderna: Il paradigma "Testo-a-Testo" consente a un singolo modello (ad es., Llama-3) di alternare compiti tramite prompting zero-shot o few-shot.
IA Tradizionale$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$Era dei Modelli FondamentaliPrompt + $x$LLM$f(p, x) \rightarrow y_{str}$Stringa $y$
Confronto di Implementazione Python